Live-Forschungsdatenplattform für Pharma | AgentixLake
← Alle Fallstudien
FALLSTUDIE · GLOBALER TOP-10-PHARMAKONZERN

Neue Forschung, innerhalb einer Minute bereit für NLP-Forschende.

Für einen globalen Top-10-Pharmakonzern hat unsere Mitgründerin eine eventgesteuerte Daten­plattform auf AWS mit aufgebaut. Sie nimmt Forschungspublikationen aus Quellen wie Springer und PubMed bei Veröffentlichung auf und stellt sie NLP-Forschenden bereit, die an neuen Medikamenten arbeiten.

Neue Publikationen in unter einer Minute nutzbar1 Mrd.+ Iceberg-Datensätze

AKTUALISIERT IM OKTOBER 2026

Die Herausforderung

Forschungspublikationen kamen live von Verlagen und Datenbanken wie Springer und PubMed, in vielen Dokumentformaten und in schwankenden Volumen. Die Plattform musste die Rohdaten als Beleg aufbewahren, Metadaten normalisieren, die Anreicherung koordinieren und jedes neue Paper schnell nutzbar machen, während jedes Ergebnis nachvollziehbar und wiederherstellbar blieb.

Streaming, Batch, Suche, Speicherung und Orchestrierung mussten deshalb als ein System zusammenarbeiten.

Warum es schwierig war

Zu den Quellformaten gehörten JATS/BITS-XML und anbieterspezifische Metadaten.
Die Verarbeitung musste bei zig Millionen Events pro Tag zuverlässig bleiben.
Lang laufende Anreicherungsschritte erforderten Replay, Dead-Letter-Handling und Idempotenz.
Die Forschenden brauchten Volltextsuche und einen Knowledge Graph aus denselben Daten.
Die Infrastruktur brauchte wiederholbare Deployments über viele AWS-Services hinweg.
Neue Publikationen mussten die Forschenden bei Veröffentlichung erreichen, nicht in einem wöchentlichen Batch.

Was wir geliefert haben

Jede Stufe bewahrt die Belege, die nötig sind, um ein abgeleitetes Ergebnis bis zur Quelle zurückzuverfolgen und fehlgeschlagene Verarbeitung sicher erneut auszuführen.

Ergebnisse

<1 Min.
Vom Eingang einer neuen Publikation bis zur Nutzung durch die Forschenden
1 Mrd.+
Datensätze, verwaltet in Apache Iceberg
30 Mio.+
Verarbeitete Events pro Tag
500 Mio.+
Verarbeitete Publikationsdatensätze, einer pro XML-Datei
45 Mio.+
Entitäten im Knowledge Graph, verknüpft durch Millionen von Beziehungen
TECHNOLOGIE
  • Logo von Amazon Web Services (AWS)AWS
  • Amazon-S3-LogoAmazon S3
  • Apache-Iceberg-LogoApache Iceberg
  • Logo von Amazon MSK (Managed Streaming for Apache Kafka)Amazon MSK
  • AWS-Glue-LogoAWS Glue
  • AWS-Fargate-LogoAmazon ECS auf AWS Fargate
  • AWS-Lambda-LogoAWS Lambda
  • Amazon-SQS-LogoAmazon SQS
  • Amazon-SNS-LogoAmazon SNS
  • Amazon-EventBridge-LogoAmazon EventBridge
  • Logo von Amazon OpenSearch ServiceAmazon OpenSearch Service
  • Neo4j-LogoNeo4j
  • Amazon-DynamoDB-LogoAmazon DynamoDB
  • Amazon-CloudWatch-LogoAmazon CloudWatch
  • Pulumi-LogoPulumi

Sie bauen ein Datenprodukt mit hohem Volumen?

Starten Sie einen Production Sprint und bringen Sie Ihren ersten Use Case in 6–8 Wochen in Produktion.